AI知識庫
路徑:【後台管理】⇒【AI平台】⇒【AI知識庫】
1. 什麼是 AI知識庫?
【AI知識庫】 讓 AI 在回答問題時能引用企業自有的文件與資料,而不只依賴模型本身的通用知識。
系統會把上傳的文件切分成小段落並向量化儲存。使用者提問時,AI 先從知識庫找出最相關的幾個段落,再依據這些段落作答。與傳統搜尋相比,回答更通順也更貼近問題;與檔案櫃相比,使用者不必自己翻找文件。
知識庫支援兩類知識:
- 文字類知識:一般的文件檔案,例如公司制度、產品說明。
- 數據表類知識:以表格形式記錄大量資料的檔案。
進入 【AI知識庫】 後,畫面上方為 知識庫名稱搜尋框 與右上角的 『新增知識庫』,下方以列表呈現已建立的知識庫。
AI知識庫主畫面
列表欄位如下:
| 欄位 | 說明 |
|---|---|
| 知識庫名稱 | 知識庫的圖示與名稱。 |
| 建立人 | 建立這個知識庫的人員。 |
| 建立時間、修改時間 | 知識庫的建立與最後異動時間。 |
| 狀態 | 以開關控制知識庫的啟用或停用。 |
| 操作 | 提供 『召回測試』 與 『刪除』。 |
2. 建立知識庫
點擊右上角的 『新增知識庫』,系統會開啟 【建立知識庫】 對話框。
建立知識庫對話框
| 欄位 | 說明 |
|---|---|
| 知識庫名稱(必填) | 知識庫在列表與被引用時顯示的名稱。 |
| 描述(必填) | 說明這個知識庫收錄哪些內容。AI 助理會依此判斷該不該查詢這個知識庫,建議具體描述涵蓋範圍。 |
| 知識數據儲存(必填) | 選擇知識要存進哪些檢索引擎,可複選 『向量庫存儲』 與 『全文搜尋庫儲存』。 |
| 圖示 | 知識庫的圖示。 |
若尚未於 統一設定 的 [全文搜尋資料庫] 完成設定,『全文搜尋庫儲存』 會呈現不可勾選狀態,滑鼠移到旁邊的說明圖示會顯示「請先完成全文搜尋資料庫設定」。
填寫完成後點擊 『確定』 建立,新的知識庫即會出現在列表中。
建立完成的知識庫
3. 上傳知識
知識庫建立後即可上傳文件。系統以 【新增知識】 精靈引導,依序完成四個步驟:上傳 ⇒ 斷句規則 ⇒ 斷句預覽 ⇒ 數據處理。
📌 步驟 1:上傳
先選擇 知識類型(『文字類知識』 或 『數據表類知識』),再將檔案拖曳到虛線框內,或點擊 『點選上傳』 選擇檔案,一次可上傳多個檔案。
支援 .txt、.html、.docx、.doc、.pptx、.ppt、.pdf 格式,檔案大小不限。
新增知識-上傳
📌 步驟 2:斷句規則
[檔案解析策略] 決定要從文件中取出哪些內容作為知識來源:
| 解析策略 | 說明 |
|---|---|
| 擷取文字內容 | 擷取檔案中的文字內容。此項為固定勾選。 |
| 提取圖片元素 | 擷取檔案中的圖片,作為知識內容的一部分,在分段中可人工標註圖片意義。 |
| 提取表格元素 | 擷取檔案中的表格元素,分段可透過 Markdown 格式進行內容調整。 |
| 多模態解析 | 開啟後,如偵測到檔案是圖片/掃描件,會透過多模態能力解析其中的文字內容,再進行分段處理;但不會針對檔案內容中的圖片做解析。 |
[斷句規則] 決定文件要如何被切成段落,二擇一:
- 自動分段清洗:自動辨識段落、正文、頁首/頁尾等資訊,以每段不超過 400 字 作為一個片段。分段結尾處如遇完整語句,該結尾語句會切分至下一個分段。
- 自訂:以 分段標識符 作為依據,將內容切分為不超過 最大長度 的段落,並依 重疊度 讓相鄰段落的內容重複一定比例,避免資訊割裂。若依分段標識符切出的段落超過最大長度,同樣會把結尾處的完整語句切分至下一個分段。
新增知識-斷句規則
重疊度 是指相鄰切片之間重複的比例。以「123456789ab」切為 3 個切片、重疊度 40% 為例,結果會是 12345、45678、789ab。適度的重疊可避免答案剛好被切斷在兩個段落之間。
📌 步驟 3:斷句預覽
畫面分為三欄:左欄為 檔案列表 與各檔案的處理狀態,中欄為 原始檔案預覽,右欄為 斷句預覽,也就是最終的分段切片結果。每一個切片會被當成最小單位,用來計算與使用者提問的匹配度。
新增知識-斷句預覽
若發現 AI 回答時常抓錯段落,多半是切片切得太碎或太大。可先在這一步觀察切片內容是否語意完整,再回上一步調整斷句規則。
📌 步驟 4:數據處理
系統開始於伺服器端處理檔案,畫面顯示各檔案的名稱、大小與處理進度。全部顯示 處理完成 後,點擊右下角的 『完成』 結束上傳。
新增知識-數據處理
📌 數據表類知識
若在步驟 1 選擇 『數據表類知識』,後續改為設定:
- 選擇 sheet 頁:指定要匯入知識庫的工作表。
- 選擇表頭行:資料會從表頭的下一行開始匯入。
- 選擇索引欄位:AI 搜尋知識庫時會依索引欄位快速定位到目標資料列。
4. 檢索方式
知識庫支援三種檢索方式,可在 AI助理 掛載知識庫時依情境選擇:
| 檢索方式 | 原理 | 優點 | 限制 |
|---|---|---|---|
| 關鍵詞檢索(全文檢索) | 將文件拆為詞元,以關鍵詞精確比對。 | 速度快,對專有名詞、術語、程式碼等精確查詢效果好。 | 無法理解語意,遇到同義詞、錯別字或用詞不同但意思相同的情況可能檢索失敗。 |
| 語意檢索(向量檢索) | 以向量比對語意相似度。 | 能處理同義詞、泛化查詢,甚至跨語言的語意匹配,對自然語言問題較友善。 | 可能忽略字面上的關鍵資訊,對非常精確的術語或數字查詢不一定比全文檢索準確,且需要較多運算資源。 |
| 混合檢索 | 同時執行上述兩種檢索,再對結果融合與重新排序。 | 兼顧關鍵詞精確度與語意相關性。 | 需額外設定全文搜尋資料庫與重排模型。 |
使用混合檢索的前置作業:
- 於 【統一設定】 完成 向量資料庫 與 全文搜尋資料庫 設定。
- 於 【建立知識庫】 時同時勾選 『向量庫存儲』 與 『全文搜尋庫儲存』。
- 於 【AI 模型】 中加入 重排(rerank)模型。
- 於 【AI助理】 呼叫知識庫的技能內,設定混合檢索所綁定的重排模型與重排權重。
5. 知識召回測試
知識庫上線前,建議先驗證「問了問題之後,是否真的能撈到正確的段落」。
點擊列表 操作 欄的 『召回測試』 即可進入。
召回測試入口
【召回測試】 頁分為 [測試任務] 與 [測試數據集] 兩個頁籤,右上角提供 任務名稱搜尋框 與 『新增測試任務』。
召回測試頁
[測試任務] 的列表欄位如下:
| 欄位 | 說明 |
|---|---|
| 序號 | 任務的排序編號。 |
| 任務名稱 | 本次測試任務的名稱。 |
| 測試數據集 | 本次採用的測試數據集。 |
| 測試規則 | 本次測試所使用的召回參數。 |
| 起止時間、持續時間 | 任務的執行區間與耗時。 |
| Token消耗 | 本次測試所消耗的 Token 數。 |
| 樣本執行情況 | 各筆樣本的執行結果統計。 |
| 執行狀態 | 任務目前的執行狀態。 |
| 操作 | 提供該筆任務可執行的操作。 |
📌 新增測試任務
點擊 『新增測試任務』,對話框分為兩個步驟:準備測試數據集 ⇒ 測試參數設定。
在 [準備測試數據集] 中填寫 測試任務名稱(必填),並以下列任一方式建立測試題目:
- 『AI生成』:由 AI 依知識庫內容先產生一批問題與預期答案。
- 『載入已有測試數據集』:沿用先前存下來的數據集。
- 『新增一列』:逐筆手動輸入。
表格中每一列包含 輸入指令/問題 與 預期輸出 兩個欄位,可直接於儲存格中微調成實際需要的內容。整理完成後,可點擊 『另存為測試數據集』 保存供日後重複使用,或直接點擊 『下一步』 進入 [測試參數設定],設定本次測試的召回參數(例如最大召回數量、最小匹配度)。
新增測試任務
執行後於 [測試任務] 列表查看結果,可比對 預期輸出 與 實際輸出 是否一致,並展開檢視本次實際召回了哪些知識片段;輸出結果也可再由 AI 大模型依據與預期答案的一致性進行評分。
調整召回參數後重跑同一份測試資料集,就能用同樣的基準比較不同參數的效果,找出最適合自家文件的設定。
6. 停用與刪除知識庫
在列表的 狀態 欄可直接以開關 啟用/停用 知識庫。停用後,助理將無法再從這個知識庫檢索內容。
點擊 操作 欄的 『刪除』,系統會跳出「確認刪除知識庫嗎?」的確認視窗,點擊 『確定』 後才會真正刪除。
刪除知識庫確認
刪除知識庫會一併移除其中所有已上傳的知識與切片,且無法復原。刪除前請先確認沒有 AI助理或 AI技能正在引用這個知識庫,否則相關的知識問答會失效。